mrsaynothing.dev

> grep -r "local LLM"▋

8 entradas

2026-10-06

llama.cpp vs Ollama — ¿cuál deberías ejecutar?

El registro público, leído no ejecutado: Ollama fija su motor llama.cpp en b11351 mientras upstream entrega b11443. Uno es un electrodoméstico, el otro es la sala de máquinas.

2026-10-02

Calculadora de VRAM para GGUF: comprueba antes de descargar

Tamaño del modelo, cuant y contexto de entrada — pesos, caché KV y veredicto por tarjeta de salida. La calculadora responde si cabe antes de empezar la descarga.

2026-09-23

¿Puede vLLM ejecutar GGUF? Sí — solo en GPU

¿Puede vLLM ejecutar GGUF? Sí — con el plugin oficial, solo en GPU. La sintaxis serve, la trampa del tokenizer, los límites de hardware y cuándo gana llama.cpp.

2026-09-13

Cuantización GGUF: Q4_K_M vs Q8_0, tamaño y VRAM

Niveles de cuantización GGUF comparados: Q4_K_M vs Q8_0 en tamaño, VRAM y calidad, y la regla — Q4_K_M por defecto, solo subes para código y matemáticas.

2026-09-10

llama.cpp vs Ollama: cuál usar en 2026

llama.cpp vs Ollama: Ollama envuelve llama.cpp por comodidad, el llama.cpp puro gana en velocidad y control. Benchmarks, flags de GPU y cuándo gana cada uno.

2026-09-07

Cómo correr modelos GGUF en local: Ollama, llama.cpp y vLLM

Cómo correr modelos GGUF en local: pulls de Ollama en una línea, llama.cpp directo desde una URL de Hugging Face y cómo elegir el quant según tu VRAM.

2026-09-04

Mejor LLM local para código: de 8 a 24 GB de VRAM

El mejor LLM local para programar por tramo de VRAM: Qwen3 Coder vs DeepSeek a 8, 12, 16 y 24 GB, el quant correcto por tarjeta y un setup de Ollama listo.

2026-09-01

Ollama vs LM Studio: qué herramienta local de LLM elegir

Ollama vs LM Studio comparados en trabajo real de desarrollo: instalación, GPU, velocidad y servido de API, con comandos listos para elegir hoy mismo.